Transformer 架构
概述
Transformer 是一种完全基于注意力机制的序列转换架构,由 Vaswani 等人于2017年提出,彻底摆脱了对循环和卷积的依赖。
关键内容
整体架构
- Encoder-Decoder 框架:编码器6层,解码器6层
- d_model = 512:统一维度贯穿整个模型
核心组件
- 缩放点积注意力:Attention(Q, K, V) = softmax(QK^T / sqrt(d_k)) V
- 多头注意力:8个头,每个 d_k = d_v = 64
- 位置感知前馈网络:FFN(x) = max(0, xW_1 + b_1)W_2 + b_2
- 位置编码:正弦/余弦函数
- 残差连接 + 层归一化:[Layer Normalization|LayerNorm]
三种注意力
历史影响
来源
- raw/books/计算机科学/20-vaswani-transformer.md
- raw/articles/ai-papers/machine-learning/14_transformer_2017.md — 完整代码实现 + RNN并行化困境 + 架构演变
- raw/articles/ai-papers/foundations/paper_06_transformer.md — 全文精读
相关
- Transformer 论文 — 首次提出
- 自注意力机制 — 核心计算
- 函数式编程 — 计算的组合性
- MapReduce — 并行化计算
- Pre-LN架构 — 现代变体(更稳定的归一化顺序)